第四幕第三層:問法會污染答案。
同一位隊友、同一份稿子、同一個錯誤,問法不同,結論相反。今天講怎麼問。
我派複驗的標準句型長這樣:「以下這段引述,請查證是否屬實。」
回覆長這樣:「查證屬實,完全符合數據。」
而那段引述是錯的——Day 4 講過那個例子,一篇論文我寫成「生成的題目沒過品質檢核、錯誤率隨學科漂移」,實際上人家講的是生成的提示,四個主題全是數學的子領域。同一天派給另外三位,三位各自獨立抓到。
只有那一位背書。而且能力表上記著,這是第三次同型:他傾向替被審者的措辭背書,而不是回去對原文。
「這條對不對?」是一個是非題,而且題目本身已經給了一個現成答案。模型只要判斷「這段話讀起來合不合理」就能作答——不需要真的去把原文找出來。
而那段話讀起來當然合理,是我寫的,我寫的時候自己也覺得合理。
換句話說,這個問法允許他在不接觸外部真相的情況下完成任務。跟 Day 21 講的純文字審查是同一個病根,只是這次的破口在問句本身——它留了一條繞過去的路。
現在派複驗給這位隊友,工單一律寫成:
原文的原話是什麼?跟我寫的哪裡不一樣?
這句話的形狀完全不同。它要求交出證據:得先找到原文、引出原話,才有東西可以比。這件事無法在腦子裡完成。
同樣的改寫可以套在很多地方:
・「這個數字對嗎」→「這個數字出現在哪一頁?把那句話貼給我」
・「這段程式有問題嗎」→「跑一次,把輸出貼給我」
・「這個做法可行嗎」→「專案文件裡關於這件事寫了什麼?」
通則是:別問判斷,問證據。判斷可以憑感覺產生,證據不行。
還有一次,同一位隊友判斷某個流程「可以用某種方式自動化」。答案其實白紙黑字寫在專案文件的第十一行,而且是反的,那個方式在這個環境行不通。
他沒讀文件,憑通則推理。更麻煩的是同一份報告最後寫著「不確定之處:無」。
第二輪我在工單裡加了一條硬規矩:牽涉技術可行性、或流程實際怎麼跑的問題,先讀專案文件再判斷。並且直接列出必讀的檔案清單。
這次他讀了,而且自己認錯。
我覺得這件事很值得記:工單沒把「該去哪裡找答案」講清楚,模型才照樣答錯。同一位隊友,加了一句規矩就從錯到對。在怪模型之前,先看看工單有沒有留給他偷懶的空間。
這位隊友在別的任務上很強,抓格式、抓漏列、抓前後不一致,他做得比誰都細。能力表上的評語寫得很明白:他抓一致性很好,抓「引述與原文對不對得上」不可靠。
這就是為什麼那張表要按任務型態記,而不是給每位隊友打一個總分。總分會讓你在錯的地方信任他,也會讓你在對的地方低估他。
明天講另一種很難察覺的偷懶:來源附了,但只附到首頁。